AI
a few seconds ago

#AI
#OpenAI
#模型訓練
#網路安全
#AI安全
商傳媒|何映辰/台北報導
摘要

為應對 AI 模型日益增長的安全風險,OpenAI 已調整其開發策略,包括暫停部分頂尖模型的強化學習訓練,以強化監測、校準與資安防護措施。此舉是在發生與 Hugging Face 的事件,以及旗下 Astra 模型展現出關鍵網路安全能力後,對 AI 安全性採取更謹慎的態度。

人工智慧(AI)開發公司 OpenAI 近期因應日漸增高的 AI 系統潛在風險,已調整其模型發展步調,甚至暫緩了部分頂尖模型的訓練工作。此舉凸顯業界對於確保 AI 安全性的重視,特別是在模型能力快速提升之際。

OpenAI 強調,隨著 AI 模型功能日趨強大,開發與內部測試所伴隨的風險也隨之增加。近期兩大事件更印證此趨勢:一是 OpenAI 與 Hugging Face 之間發生的事件,另一是 OpenAI 發現旗下模型 Astra 可能已具備「關鍵網路安全能力」(Critical cybersecurity capability)——這意味著該 AI 模型有能力執行複雜的網路攻擊或防禦任務。

為此,OpenAI 已暫時放緩模型規模化開發的步調,其中包含暫停最新可部署模型長達兩週的「強化學習」(Reinforcement Learning, RL)訓練。強化學習是一種讓 AI 透過與環境互動來學習最佳行為的技術,暫停此類訓練是為提升研究環境的安全性並擴大監測系統的覆蓋範圍。一個大型的預定 RL 運算計畫目前仍維持暫停,直到小規模的訓練與評估能提供足夠證據,以驗證模型行為與安全防護措施的一致性(Alignment)。

OpenAI 的新策略依賴三大互補的安全防護措施:監測(Monitoring)、校準(Alignment)及資安措施(Security)。監測系統透過「啟動分類器」(Activation classifiers)即時偵測模型可能出現的異常行為,並將其升級給「自動化調查員」(automated investigators)處理。一旦偵測到可疑活動,系統目標是在 30 分鐘內發出警報,若無法在 30 分鐘內確認為誤報,該活動將會被暫停。

「校準」是指確保 AI 系統能依設計者意圖運作,並能回應人類監督。OpenAI 強調,隨著模型能力提升,惡意行為如獎勵漏洞利用(reward hacking)、欺騙或未經授權的存取,將帶來更嚴峻的風險,因此必須將校準技術應用於更廣泛的訓練階段。

資安措施則包括提升研究環境的安全標準,例如為不信任的程式碼執行提供「沙盒」(sandboxes)隔離,以及實施「網路隔離控制」(Network isolation controls),以確保單一系統遭入侵不會導致全面性網路或內部網路的未經授權存取。這些措施旨在限制 AI 系統的潛在危害與存取權限。

特別是針對 Astra 模型或具備網路安全能力的模型,需要最嚴格的安全防護措施。許多涉及 Astra 的工作項目仍處於暫停狀態,直到完全遷移並強化至符合新的安全標準。OpenAI 表示,他們將優先處理安全與校準相關的工作,以確保 AI 發展能與其理解、校準與安全的能力同步提升。